GPT-5.6 виявив 23 з 26 вразливостей CVE
Модель Qwen 3.8-Max від Alibaba продемонструвала конкурентоспроможність за витратами під час тестування на виявлення вразливостей, однак результати цієї моделі не були включені в звіт Aikido. Qwen 3.8-Max показала схожі результати з конкурентними моделями за витратами в 821 долар США під час трьох тестувань. Aikido протестувала 13 AI моделей на 26 вразливостей CVE у бенчмарку, опублікованому 16 липня. GPT-5.6 виявив 23 з 26 вразливостей, досягнувши 88,5% відтворювальності, що є найкращим показником. Моделі Claude Opus виявили від 15 до 18 вразливостей, а Grok-4.5 виявив 20. Додана модель Kimi K3 також виявила 23 вразливості, досягнувши таких же результатів, як GPT-5.6. Тестування проводилося в рамках аналітичного середовища, розробленого для дослідження реальних кодових репозиторіїв, і оцінювалося за методом 'pass@3'. Aikido вказала загальну кількість параметрів Qwen 3.8-Max у 2,4 трильйона, але кількість активних параметрів не була оприлюднена. Бенчмарк Aikido був спрямований на CVE загального програмного забезпечення, і його важко інтерпретувати як показник безпеки блокчейну.
Ціна --
Цей контент надано лише для загальних інформаційних цілей і не є фінансовою, інвестиційною, юридичною чи податковою консультацією. Події, нагороди, онлайн-акцій або пов’язану інформацію, згадана тут, не слід розглядати як рекомендацію, прохання чи запрошення до купівлі, продажу, торгівлі чи інших операцій з криптоактивами. Криптоактиви є дуже волатильними та можуть призвести до збитків. Доступність послуг, продуктів WEEX та пов’язаних із ними подій може відрізнятися залежно від регіону. Ви несете відповідальність за забезпечення відповідності вашої участі чинному місцевому законодавству та нормативним актам.
Вам також може сподобатися

Апаратура Anthropic AI досягає 99,3% успіху в тестах

GLM-5.3-Flash офіційно відкрито, 320 мільярдів параметрів активують 18 мільярдів, ціна в одну десяту від GLM-5.2

Витрати на Fable 5 становлять 11,4%, зміни в прийнятті AI

Anthropic представив дві моделі Claude, досвід спілкування Marshmallow перевищує Opus 5

Fable 5 токен 6%, Opus 5 за половину ціни

Звіт ARK за тиждень: AI-агенти продовжать сприяти розвитку Anthropic та OpenAI, Grok 4.6 може знизити витрати на передові AI

Корпоративні клієнти обирають дешевші моделі замість Claude Fable 5

Anthropic інтегрує Mythos 5 у Claude Security, доступний для підприємств, але не для прямого виклику

Anthropic тестує кооперацію багатьох агентів, виявляючи агресивну поведінку

Новий трюк виявляє приховані думки ШІ та відновлює війну за дистиляцію

Виявлено, що агент Claude самостійно використовує вразливість в Австралії

Клод Сонет 5, перехід на стандартну ціну заплановано на 1 вересня

Андрій Капасі створює 3D світ гри за допомогою речення з роману

Grok 4.6 отримує дату запуску 7 серпня, Grok 4.7 слідує за ним

Запуск моделі Claude Opus 5 на платформі B.AI API

Рейд Хоффман та Марк Пінкус інвестують в AI-лабораторію Prentis, що шукає фінансування в 100 мільйонів доларів

DeepSeek V4 API, ймовірно, використовує модель Fable 5

Маск оголосив, що SpaceXAI завтра випустить Grok 4.5

SpaceXAI та Cursor планують запустити першу AI модель у середу

OpenAI планує відкрити GPT-5.6 7 липня, Gemini 3.5 Pro заплановано на 17 липня

Claude Fable 5 не був знижений. Роутер просто параноїдальний

DGrid AI запускає платформу штучного інтелекту DClaw, яка допомагає користувачам створити власного локального помічника на базі штучного інтелекту одним кліком





