Microsoft заявляє, що MDASH перевершує Claude Mythos та GPT-5.6 Sol у тесті з кібербезпеки
Microsoft представила свою першу спеціалізовану модель кібербезпеки під назвою MAI-Cyber-1-Flash і інтегрувала її в MDASH, систему для виявлення вразливостей, яка, за словами компанії, перевершує Mythos 5 від Anthropic та GPT-5.6 Sol від OpenAI, при цьому коштує на 50% менше, ніж найкраща конфігурація MDASH від Microsoft.
Згідно з Microsoft, комбінована система отримала 95,95% на CyberGym. CyberGym — це бенчмарк, який просить AI-агентів відтворити 1,507 відомих вразливостей у 188 відкритих проектах, а потім оцінює їх за відсотком успішно відтворених у контрольованому середовищі.
Це поставило MDASH попереду GPT-5.5 Cyber з 85,6%, Mythos 5 з 83,8%, GPT-5.6 Sol з 83,6% та Gemini 3.5 Flash Cyber з 83,2%. Результат самостійно повідомлений Microsoft і не з'явився на публічному лідерборді CyberGym на момент публікації, хоча бенчмарк використовує публічний тестовий набір і визначену метрику успіху.
MAI-Cyber-1-Flash не працює самостійно. Microsoft стверджує, що вона виконує до 90% завдань, тоді як MDASH перенаправляє найскладніші 10% до GPT-5.4. Це важливо, оскільки токени — частини тексту, які обробляє AI — коштують грошей щоразу, коли модель читає код або генерує відповідь.
Це перший випадок, коли модель Microsoft, створена для ефективності, здатна перевершити щільну модель найвищого рівня, створену з урахуванням загальних можливостей. "Коли поєднується з MDASH, (MAI-Cyber-1-Flash) забезпечує світовий клас продуктивності за 50% вартості провідних моделей," написав генеральний директор Microsoft Сатья Наделла.
Модель (в даному випадку MAI-Cyber-1-Flash) є AI, який міркує над кодом. Обладнання (MDASH у цьому випадку) — це механізми навколо неї: агенти, інструменти, перевірки та робочий процес, які вирішують, куди дивитися, ставлять під сумнів підозрілі знахідки, видаляють дублікати та доводять, що помилка може бути викликана.
MDASH використовує більше 100 спеціалізованих агентів, призначених для аудиту коду, обговорення, чи є знахідка справжньою, та створення доказу концепції — робочої демонстрації того, що недолік існує.
Microsoft заявила, що випадкові сканування та затримані патчі стають застарілими, оскільки AI робить виявлення помилок дешевшим. Компанія стверджує, що десятиліття даних безпеки дають їй перевагу, додаючи: "Ніхто не може створити цю історію."
Відтоді, як було випущено Claude Mythos, експерти з кібербезпеки намагалися перевершити або зрівнятися з його можливостями. Дослідники відтворили полювання на вразливості в стилі Mythos з публічними моделями за менше ніж 30 доларів за сканування. Давид Моцадло, один з дослідників, залучених до цього, сказав: "окопи переміщуються від доступу до моделі до валідації."
Рідкісною частиною стає система, яка доводить знахідки, не завантажуючи розробників помилковими тривогами.
Decrypt також повідомив, що GPT-5.5 Cyber нещодавно зайняв перше місце на публічному CyberGym з оцінкою 85,6%, трохи перевершивши Mythos. Оцінка Microsoft приблизно на 10 пунктів вище, ніж у GPT-5.5 Cyber, і на 7,5 пунктів вище, ніж попередній результат MDASH, але вона оцінює всю систему, а не MAI-Cyber-1-Flash окремо.
Microsoft вводить MDASH у приватний попередній перегляд через Microsoft Security Exposure Management у порталі Defender. Клієнти можуть сканувати Git-репозиторії, бачити знахідки, оцінені від малоймовірних до підтверджених, і використовувати Defender CLI для генерації запропонованих виправлень коду для перегляду розробниками.
Попередній перегляд наразі обмежує репозиторії приблизно до 256 МБ і дозволяє одне паралельне сканування на кожного орендаря. Проект Perception очікується, що розширить той же підхід з багатьма агентами за межі сканування коду в більш широкі робочі процеси моніторингу загроз і усунення наслідків.
Ціна --
Цей контент надано лише для загальних інформаційних цілей і не є фінансовою, інвестиційною, юридичною чи податковою консультацією. Події, нагороди, онлайн-акцій або пов’язану інформацію, згадана тут, не слід розглядати як рекомендацію, прохання чи запрошення до купівлі, продажу, торгівлі чи інших операцій з криптоактивами. Криптоактиви є дуже волатильними та можуть призвести до збитків. Доступність послуг, продуктів WEEX та пов’язаних із ними подій може відрізнятися залежно від регіону. Ви несете відповідальність за забезпечення відповідності вашої участі чинному місцевому законодавству та нормативним актам.
Вам також може сподобатися

Скорочення випуску Solana на 18,9 мільйона SOL... Експеримент з квантовою стійкістю BTC

Генеральний директор Джеремі Аллер заявляє, що Circle створила «платформу для фінансової системи Інтернету», але cirBTC має лише 40 BTC

SHAKA Festival 2026: У Біарріці французька технологія обирає пляж замість конференц-залу

Обсяг торгівлі в додатку PumpFun перевищив 50 мільйонів доларів за день

Купівля криптовалют в Бразилії: посібник пояснює правила, ризики та найкращі практики

15 гаманців заробили 312000 доларів на ймовірному rug pull токена GOLD

ETF Solana перевищив 1 мільярд доларів, підкреслюючи структурні відмінності з ETF Ripple

Що таке StonkFun (STONK)? Посібник з торгівлі токенізованими акціями та пояснення механізму

Solana розширює ліміт транзакцій до 4096 байт 9 вересня

Хто володіє ткацьким верстатом: Virtuals прагне перетворити AI-агентів на торгівельні 'віртуальні нації'

Avici завершив повне повернення коштів та надає 10% кешбек

Avici Solana neobank: хакер вивів 1,07 млн доларів клієнтів

Solana збільшує скорочення емісії SOL до 30%

Роздуми засновника: Чому Fomo пробіг далі за нас з тієї ж стартової точки?

Токен GOLD обвалився на 99% після посту, пов'язаного з Трампом, вартість $1 млн

ETF Bitwise для Solana перевищив 1 мільярд доларів

XRP ETF отримують популярність у двох поданнях фондів США

Блокчейн: Mastercard розкриває, що насправді вимагають банки

Charles Schwab додає Solana, Avalanche та Chainlink до своєї крипто-пропозиції

Проект GOLD отримав прибуток понад 8,2 мільйона доларів, планує збільшити винагороду до 10 мільйонів доларів

Фонд Fogo повідомляє про несанкціонований переказ 400 мільйонів токенів FOGO

Чистий приплив SOL спотового ETF за день склав 18,0813 мільйона доларів

Rain завершила виправлення вразливості старої версії контракту Solana

AI Workers Earn $400 Million Annually, Virtuals Aims to Make You a Shareholder

API Zerion: плата 0,01 USDC за виклик

Експеримент з перевірки платежів AI: 75,41 мільйонів транзакцій X402

Атака на Avici вивела понад 1 мільйон доларів з користувачів Solana

Три ETF Avalanche впровадили структуру розподілу винагород за стейкінг

Продаж 6,948 BTC стратегією став ризиком для наративу: Bitfinex








