Microsoft заявляє, що MDASH перевершує Claude Mythos та GPT-5.6 Sol у тесті з кібербезпеки

By: decrypt.co|2026/07/27 19:01:04
0
Поширити
copy
Оцінити в GoogleОцінити в Google

Microsoft представила свою першу спеціалізовану модель кібербезпеки під назвою MAI-Cyber-1-Flash і інтегрувала її в MDASH, систему для виявлення вразливостей, яка, за словами компанії, перевершує Mythos 5 від Anthropic та GPT-5.6 Sol від OpenAI, при цьому коштує на 50% менше, ніж найкраща конфігурація MDASH від Microsoft.

Згідно з Microsoft, комбінована система отримала 95,95% на CyberGym. CyberGym — це бенчмарк, який просить AI-агентів відтворити 1,507 відомих вразливостей у 188 відкритих проектах, а потім оцінює їх за відсотком успішно відтворених у контрольованому середовищі.

Це поставило MDASH попереду GPT-5.5 Cyber з 85,6%, Mythos 5 з 83,8%, GPT-5.6 Sol з 83,6% та Gemini 3.5 Flash Cyber з 83,2%. Результат самостійно повідомлений Microsoft і не з'явився на публічному лідерборді CyberGym на момент публікації, хоча бенчмарк використовує публічний тестовий набір і визначену метрику успіху.

MAI-Cyber-1-Flash не працює самостійно. Microsoft стверджує, що вона виконує до 90% завдань, тоді як MDASH перенаправляє найскладніші 10% до GPT-5.4. Це важливо, оскільки токени — частини тексту, які обробляє AI — коштують грошей щоразу, коли модель читає код або генерує відповідь.

Це перший випадок, коли модель Microsoft, створена для ефективності, здатна перевершити щільну модель найвищого рівня, створену з урахуванням загальних можливостей. "Коли поєднується з MDASH, (MAI-Cyber-1-Flash) забезпечує світовий клас продуктивності за 50% вартості провідних моделей," написав генеральний директор Microsoft Сатья Наделла.

Модель (в даному випадку MAI-Cyber-1-Flash) є AI, який міркує над кодом. Обладнання (MDASH у цьому випадку) — це механізми навколо неї: агенти, інструменти, перевірки та робочий процес, які вирішують, куди дивитися, ставлять під сумнів підозрілі знахідки, видаляють дублікати та доводять, що помилка може бути викликана.

MDASH використовує більше 100 спеціалізованих агентів, призначених для аудиту коду, обговорення, чи є знахідка справжньою, та створення доказу концепції — робочої демонстрації того, що недолік існує.

Microsoft заявила, що випадкові сканування та затримані патчі стають застарілими, оскільки AI робить виявлення помилок дешевшим. Компанія стверджує, що десятиліття даних безпеки дають їй перевагу, додаючи: "Ніхто не може створити цю історію."

Відтоді, як було випущено Claude Mythos, експерти з кібербезпеки намагалися перевершити або зрівнятися з його можливостями. Дослідники відтворили полювання на вразливості в стилі Mythos з публічними моделями за менше ніж 30 доларів за сканування. Давид Моцадло, один з дослідників, залучених до цього, сказав: "окопи переміщуються від доступу до моделі до валідації."

Рідкісною частиною стає система, яка доводить знахідки, не завантажуючи розробників помилковими тривогами.

Decrypt також повідомив, що GPT-5.5 Cyber нещодавно зайняв перше місце на публічному CyberGym з оцінкою 85,6%, трохи перевершивши Mythos. Оцінка Microsoft приблизно на 10 пунктів вище, ніж у GPT-5.5 Cyber, і на 7,5 пунктів вище, ніж попередній результат MDASH, але вона оцінює всю систему, а не MAI-Cyber-1-Flash окремо.

Microsoft вводить MDASH у приватний попередній перегляд через Microsoft Security Exposure Management у порталі Defender. Клієнти можуть сканувати Git-репозиторії, бачити знахідки, оцінені від малоймовірних до підтверджених, і використовувати Defender CLI для генерації запропонованих виправлень коду для перегляду розробниками.

Попередній перегляд наразі обмежує репозиторії приблизно до 256 МБ і дозволяє одне паралельне сканування на кожного орендаря. Проект Perception очікується, що розширить той же підхід з багатьма агентами за межі сканування коду в більш широкі робочі процеси моніторингу загроз і усунення наслідків.

Ціна --

--
--
--

Цей контент надано лише для загальних інформаційних цілей і не є фінансовою, інвестиційною, юридичною чи податковою консультацією. Події, нагороди, онлайн-акцій або пов’язану інформацію, згадана тут, не слід розглядати як рекомендацію, прохання чи запрошення до купівлі, продажу, торгівлі чи інших операцій з криптоактивами. Криптоактиви є дуже волатильними та можуть призвести до збитків. Доступність послуг, продуктів WEEX та пов’язаних із ними подій може відрізнятися залежно від регіону. Ви несете відповідальність за забезпечення відповідності вашої участі чинному місцевому законодавству та нормативним актам.

Вам також може сподобатися

Скорочення випуску Solana на 18,9 мільйона SOL... Експеримент з квантовою стійкістю BTC

Експеримент з квантовою стійкістю біткоїна (BTC) та ухвалення скорочення випуску Solana (SOL) стали важливими темами для обговорення в контексті довгострокової безпеки та структури постачання на ринку блокчейнів.

Генеральний директор Джеремі Аллер заявляє, що Circle створила «платформу для фінансової системи Інтернету», але cirBTC має лише 40 BTC

cirBTC Circle утримував 42.5 BTC проти 40 токенів, але WBTC та cbBTC залишаються тисячами разів більшими напередодні запуску Arc.

SHAKA Festival 2026: У Біарріці французька технологія обирає пляж замість конференц-залу

Обсяг торгівлі в додатку PumpFun перевищив 50 мільйонів доларів за день

Обсяг торгівлі в мобільному додатку PumpFun (PUMP) перевищив 50 мільйонів доларів (приблизно 689 мільйонів вон), а кількість угод зросла до 905 тисяч. Показники використання додатку платформи для випуску мемкоінів на базі Solana...

Купівля криптовалют в Бразилії: посібник пояснює правила, ризики та найкращі практики

15 гаманців заробили 312000 доларів на ймовірному rug pull токена GOLD

...

Вміст

Найновіші статті

Більше

Нещодавні лістинги монет на WEEX

iconiconiconiconiconicon
Підтримка клієнтів:@weikecs
Співпраця:@weikecs
Кількісна торгівля та маркетмейкінг:[email protected]
VIP-програма:[email protected]