Конкуренція агентів ШІ: перехід від продуктивності моделей до корпоративних систем
Конкуренція агентів штучного інтелекту зміщує свою вагу з можливостей управління комп'ютером до операційних систем, які можна безпечно впроваджувати в корпоративні завдання. Аналіз показує, що для реального виконання завдань необхідно мати не лише продуктивність моделей, але й контекст та управління правами доступу, відновлення помилок і системи верифікації.
У статті, опублікованій 28 серпня 2025 року компанією Andreessen Horowitz, зазначається, що агенти, які використовують комп'ютери, безпосередньо взаємодіють з браузерами та настільними середовищами, розширюючи обсяги автоматизації завдань. На підприємствах вважається, що важливіше за універсальні моделі є контекст для конкретних компаній, проєктування надійності та оркестрація тривалих завдань.
Агенти, що використовують комп'ютери, є системами штучного інтелекту, які розпізнають екран, на якому працює людина, і виконують дії, такі як натискання, введення даних та переміщення по екрану. Вони відрізняються від традиційної автоматизації процесів (RPA), оскільки можуть вибирати необхідні інструменти та обробляти кілька етапів після отримання цілей.
Завданнями для таких агентів є пошук документів, введення даних у системи управління клієнтами, сповіщення через внутрішні месенджери та складання звітів, що вимагає роботи з кількома програмами. У корпоративних завданнях важливими є права доступу, обробка винятків, записи аудиту та процедури затвердження, тому автоматизація всього процесу лише на основі можливостей управління екраном є складною.
Згідно з офіційною статтею OSWorld, у 369 реальних комп'ютерних завданнях людська продуктивність становила 72,36%, тоді як успішність найкращої моделі становила 12,24%. OSWorld є бенчмарком, який вимірює здатність працювати з файлами, додатками та веб-сторінками в реальному середовищі операційної системи.
OpenAI повідомила, що комп'ютерний агент (Computer-Using Agent, CUA), опублікований 23 січня 2025 року, досяг успішності 38,1% в OSWorld, 58,1% в WebArena та 87% в WebVoyager. Ці цифри свідчать про те, що моделі, які безпосередньо працюють з комп'ютерами, переходять від етапу дослідження до етапу комерціалізації.
Однак, навіть якщо вимірювати однакові можливості управління комп'ютером, результати можуть бути важко порівняти через різні версії бенчмарків, конфігурації завдань та виконання. Оригінальні статті, перевірені OSWorld, та повторні оцінки окремих компаній застосовують різні умови, тому необхідно вказувати критерії оцінки разом з показниками продуктивності.
Це також пояснює, чому важко пояснити вузькі місця корпоративних агентів ШІ лише за допомогою оцінок моделей. Навіть якщо є потужна модель, без системи, яка своєчасно надає необхідний контекст, перевіряє результати виконання та відновлює невдалі завдання, важко стабільно експлуатувати в продуктивному середовищі.
Microsoft у статті, опублікованій 2 червня 2026 року, зазначила, що для підприємств важливі не лише потужні моделі або обчислювальні ресурси, але й системи для створення, розгортання, спостереження та контролю агентів. Вона виділила такі ключові умови для впровадження в продуктивне середовище, як контекст, управління, спостережуваність та постійне вдосконалення.
OpenAI також зазначила в статті, опублікованій 25 червня 2026 року, що спосіб використання агентів змінюється від одноразових запитів до делегування тривалих завдань. Чим довше триває робота, тим важливішими стають перевірка проміжних результатів, обмеження прав доступу та процедури передачі завдань людям у разі невдачі.
Безпека є ще одним викликом, який повинні вирішити корпоративні агенти. Коли агенти отримують доступ до внутрішніх документів та систем управління, зростає ризик як використання необхідного контексту, так і витоку чутливої інформації.
Дослідження Microsoft Research під назвою CI-Work вказує на те, що рівень порушення конфіденційності агентів на основі великих мовних моделей (LLM) становить від 15,8% до 50,9%, а рівень витоку інформації може досягати 26,7%. Дослідники дійшли висновку, що лише збільшення розміру моделі або глибини висновків не вирішить проблему витоку інформації в залежності від контексту.
У галузі існує дві точки зору: одна вважає, що агенти, які проходять через екрани та браузери, є перехідним способом для з'єднання з існуючим програмним забезпеченням, а інша вважає, що агенти, які безпосередньо взаємодіють з існуючими інструментами, стануть основними. Обидві точки зору погоджуються, що для реального впровадження необхідні контроль доступу, захисні механізми та перевірка результатів виконання.
Усередині компаній тривають спроби створити структуру управління агентами. Внутрішня система AI Coinbase застосувала структуру хмарного пісочниці, координацію підагентів та автоматичне створення завдань, що стає основою для розмежування обсягу виконання та відповідальності в процесі виконання кількох етапів завдань.
У сфері віртуальних активів безпосередній контакт полягає не лише в цінових перевагах агентів ШІ, але й у тому, як спроектувати ідентичність, права доступу та систему аудиту. Оскільки розпочато спільне дослідження для перевірки ідентичності та дозволів автономних торгових агентів, важливість системи контролю зростає в міру того, як агенти все більше інтегруються в корпоративні завдання та інфраструктуру цифрових активів.
Ціна --
Цей контент надано лише для загальних інформаційних цілей і не є фінансовою, інвестиційною, юридичною чи податковою консультацією. Події, нагороди, онлайн-акцій або пов’язану інформацію, згадана тут, не слід розглядати як рекомендацію, прохання чи запрошення до купівлі, продажу, торгівлі чи інших операцій з криптоактивами. Криптоактиви є дуже волатильними та можуть призвести до збитків. Доступність послуг, продуктів WEEX та пов’язаних із ними подій може відрізнятися залежно від регіону. Ви несете відповідальність за забезпечення відповідності вашої участі чинному місцевому законодавству та нормативним актам.
Вам також може сподобатися

DGrid AI: реконструкція механізму довіри до інфраструктури AI за допомогою PoQ та верифікаційних вузлів

200 AI торгових продуктів абсолютно неефективні? Колишній співзасновник Foresight Ventures зробив щось інакше

NVIDIA Qwen3.8-Flash-Next досягає понад 16 тисяч токенів на секунду на платформі GB300 NVL72

Qualcomm випустила IMSDK 2.0 для розвитку додатків на основі AI на краю

Чому ваше письмо звучить як AI? Редактори a16z навчають вас, як повернути «людський дотик»

Apple представила Mac mini з чіпом M6, початкова ціна 899 доларів

CFTC розглядає доцільність перпетуальних ф'ючерсів на GPU обчислення【Останні новини】

Thomson Reuters розробила юридичну AI модель 'Thomson' за 40 мільйонів доларів

Google та AMD співпрацюють у розробці 10-го покоління TPU, інтегруючи ядра CPU для задоволення потреб у обчисленнях AI

Хоскінсон представив відкритий проект для обробки маркерів AI

SanDisk оголосила про прогнози попиту на NAND обсягом 75-100EB до 2027 року

Toss Securities відкриває OpenAPI для всіх клієнтів

Північнокорейська хакерська група розробляє та впроваджує AI-інструменти для кібератак на криптовалютні компанії

IOSG: За спиною Hermes — шлях розвитку команди Web3

Vitalik заявив, що Minimax H3 перевершує HunyuanVideo 1.5

Алекс Карп та війна за суверенітет у сфері ШІ в компаніях

Qualcomm співпрацює з Multiverse Computing для оптимізації AI-моделей

Університет народної поліції Китаю розробив AI для виявлення незаконних транзакцій з біткоїнами з точністю 89,4%

Чи варто брати участь у програмі лояльності Axis Robotics після залучення 12 мільйонів доларів у раунді seed?

Чому акції гірничодобувних компаній зросли, незважаючи на падіння BTC на 46%?

Відтворення "DeepSeek моменту"? Уолл-стріт стверджує: Kimi K3 навпаки підвищує попит на обчислювальні потужності

Акції гірничодобувних компаній все далі від криптовалют

Останні новини All-In: IPO Anthropic проти OpenAI, розкриття реального ROI AI, обмеження експорту китайських моделей та загальнонаціональне володіння акціями

Аналіз внутрішнього листа Zhiyu AI: Велика хвиля вже тут, після виходу на біржу не намагатимемося отримати прибуток, а зосередимося на наукових дослідженнях, ставлячи на найвитратніший шлях AGI

Кількість користувачів Bai B.AI перевищила 2 мільйони

Claude Fable 5 не був знижений. Роутер просто параноїдальний

Serenity: Потоки фінансів на китайському первинному ринку спрямовуються на фізичний ШІ та світові моделі

Ключові тези: повний текст виступу головного науковця Google Шенахана

Агентні шаблони проектування: книга, яка змусила мене переосмислити питання: «Що саме таке Агент?»





