Claude Opus 5 перевершує Fable 5 за більшістю показників — за половину ціни
Claude Opus 5 сьогодні вийшов. Його експлуатація для бізнесу дешевша, ніж у провідної моделі Anthropic, Claude Fable 5, яку компанія позиціонувала як повсякденний продукт для платних користувачів. Більше того, Opus 5 також перевершує його за значними показниками.
Щоб зрозуміти, де розташований Opus 5: лінійка Anthropic складається з чотирьох рівнів. Haiku є швидким і дешевим. Sonnet — середнього рівня. Opus — важкий робочий кінь. Вище цього знаходиться клас Mythos — рівень, який Anthropic представила цієї весни — до якого входять Claude Fable 5 для публіки та Claude Mythos 5, версія з меншими обмеженнями, зарезервована через Project Glasswing для перевірених дослідників у сфері кібербезпеки та операторів критичної інфраструктури.
Fable 5 мав важкий шлях як флагманський продукт для підписників. Він був запущений 9 червня, через три дні був відкликаний у всьому світі після того, як уряд США видав термінове розпорядження про експортний контроль через вразливість jailbreak, і повернувся 30 червня — лише для того, щоб відразу перейти на модель лише з кредитами, більше не включену в стандартні плани. Opus 5 тепер заповнює місце, яке не змогла зайняти Fable 5.
Lovable, платформа для розробників з мільйонами користувачів, провела внутрішні оцінки Opus 5 і зазначила, що переваги виходять за межі простих оцінок: "Він не тільки кращий у наших найскладніших агентних програмних завданнях, на 22% краще, ніж Opus 4.7, він також стабільніший, з набагато меншою варіацією від запуску до запуску," — сказав Фабіан Хедін у заяві, опублікованій Anthropic.
Показники
Це може звучати дивно, але Opus перевершує Fable майже в усьому, що має значення для повсякденного користувача, не будучи позначеним як клас Mythos, як Fable.
На Frontier-Bench v0.1 — показнику, який тестує, чи можуть AI-кодувальні агенти виконувати реальні завдання програмної інженерії від початку до кінця, оцінюється як відсоток виконаних завдань — Opus 5 досяг 43,3%. Fable 5 набрав 33,7%. GPT-5.6 Sol від OpenAI, основного комерційного конкурента Anthropic, набрав 34,4%.
Найбільша різниця спостерігається на ARC-AGI-3, тесті на справжнє вирішення проблем, побудованому на нових головоломках, які модель не могла запам'ятати з навчальних даних, оцінюється як відсоток розв'язаних головоломок. Opus 5 досяг 30,2%; GPT-5.6 Sol набрав 7,8%; а Fable 5 взагалі не тестувався. На GDPval-AA v2 — показнику знань, оціненому за рейтингами Elo, шаховою системою ранжування, що використовується для вимірювання відносної продуктивності на реальних професійних завданнях — Opus 5 досяг 1861 проти 1747 Fable 5 та 1736 GPT-5.6 Sol.
Zapier протестував Opus 5 на AutomationBench, оцінці, яка визначає, чи може модель виконати повний бізнес-процес від початку до кінця без людської допомоги. Їхній вердикт: модель "взяла сирий робочий зошит з обліку здоров'я та виконала повну послідовність запобігання відтоку: позначаючи ризиковані рахунки, сповіщаючи відповідного власника та підсумовуючи для операцій з утримання. Попередні моделі не пройшли; Opus 5 досяг 100%."
Anthropic також позиціонує Opus 5 як оновлення для досліджень. Ultima Genomics, компанія з секвенування ДНК, заявила, що модель "поводиться більше як обережний вчений, ніж будь-яка модель, яку ми запускали. Вона обирає правильні статистичні тести, щоб виключити змішувачі, перевіряє свої результати незалежними методами та залишається на правильному шляху під час тривалих багатоступеневих аналізів."
Сказавши це, ці дві області — юридична та охорона здоров'я — є єдиними, в яких Fable 5 перевершує на невелику перевагу.
Випуск відбувається через тиждень після того, як Moonshot AI, стартап з Пекіна, підтримуваний Alibaba, представив Kimi K3 — модель з 2,8 трильйона параметрів (що означає, що будь-хто може завантажити основний код для незалежного запуску), яку Moonshot описує як найбільшу у світі відкриту AI-систему. Незалежні показники постійно ставлять Kimi K3 на третє місце загалом, поступаючись як Fable 5, так і GPT-5.6 Sol, перевершуючи їх у конкретних областях.
Opus 5 доступний зараз через API за $5 за мільйон вхідних токенів і $25 за мільйон вихідних. (Токени — це базова одиниця інформації, яку модель AI може обробляти як у вхідних, так і у вихідних даних). Також доступний швидкий режим, що працює приблизно в 2,5 рази швидше за стандартну швидкість, за подвоєну базову ціну — $10 за мільйон вхідних токенів і $50 за мільйон вихідних.
Цей випуск може покласти край тривозі щодо відсутності публічної доступності Fable 5. Opus також доступний за підпискою для всіх.
Ціна --
Цей контент надано лише для загальних інформаційних цілей і не є фінансовою, інвестиційною, юридичною чи податковою консультацією. Події, нагороди, онлайн-акцій або пов’язану інформацію, згадана тут, не слід розглядати як рекомендацію, прохання чи запрошення до купівлі, продажу, торгівлі чи інших операцій з криптоактивами. Криптоактиви є дуже волатильними та можуть призвести до збитків. Доступність послуг, продуктів WEEX та пов’язаних із ними подій може відрізнятися залежно від регіону. Ви несете відповідальність за забезпечення відповідності вашої участі чинному місцевому законодавству та нормативним актам.
Вам також може сподобатися

Колишній науковець DeepMind Цао Юань заявив, що AI для отримання Нобелівської премії потребує 20-30 років

Вихід Хасабіса: остання сцена епохи до LLM

DeepMind змінює керівництво, чому Google Cloud може стати найбільшим переможцем?

Різкі зміни в керівництві Google AI: фізичне розмежування між AGI та повсякденними моделями

Керівник Google DeepMind заявив, що інвестиції в ШІ ставлять на рекурсивне самовдосконалення

DeepSeek приніс весну підприємцям у сфері AI-додатків

25-річний AI гуру також зазнав збитків? Situational Awareness шукає нові інвестиції, засновник закликає інвесторів «використати можливість для покупки»

Amazon переробляє AI, зупиняє оновлення флагманської моделі Nova

Altman підсумовує найскладніший рік OpenAI

Amazon коригує стратегію AI, відмовляється від більшості моделей Nova, зосереджується на передових дослідженнях

Amazon скорочує штат у відділі AGI, після скорочення на 16 тисяч у січні відбувається нова корекція

Запис чотиригодинної зустрічі інвесторів з Лян Веньфенгом

Лян Веньфен говорить, що мета DeepSeek - AGI, а не супер додаток

Тестування GPT-6 триває вже майже два місяці, його можливості, ймовірно, наближаються до AGI

Спостереження WAIC: Переповнений консенсус, величезна бульбашка

Прогноз Delphi Ventures на наступні десять років: ШІ/автоматизація, глобальна багатополярність та старіння населення формують новий світ

Zhipu продовжує зосереджуватися на дослідженнях AGI, запускає програму Touch High

Засновник MiniMax Ян Цзюньцзе припинив отримувати зарплату, виділивши 5% акцій для мотивації команди та підтримки відкритого коду

Скандал з DeepSeek: геній Huawei Лі Бодзє в центрі уваги інвесторів Web3

Партнер Dragonfly Хасіб говорить про інвестиційні принципи: залишайтеся на ринку, вірте в експоненціальне зростання



