Microsoft twierdzi, że MDASH przewyższa Claude Mythos i GPT-5.6 Sol w teście cyberbezpieczeństwa
Microsoft zaprezentował swój pierwszy dedykowany model cyberbezpieczeństwa o nazwie MAI-Cyber-1-Flash i zintegrował go z MDASH, systemem do wykrywania luk, który, według firmy, przewyższa Mythos 5 firmy Anthropic oraz GPT-5.6 Sol firmy OpenAI, kosztując 50% mniej niż obecna najlepsza konfiguracja MDASH firmy Microsoft.
Zintegrowany system uzyskał wynik 95,95% w CyberGym, według Microsoftu. CyberGym to benchmark, który wymaga od agentów AI reprodukcji 1 507 znanych luk w 188 projektach open-source, a następnie ocenia ich na podstawie procentu skutecznie odtworzonych w kontrolowanym środowisku.
To umieściło MDASH przed GPT-5.5 Cyber z wynikiem 85,6%, Mythos 5 z wynikiem 83,8%, GPT-5.6 Sol z wynikiem 83,6% oraz Gemini 3.5 Flash Cyber z wynikiem 83,2%. Wynik ten jest samodzielnie zgłaszany przez Microsoft i nie pojawił się na publicznej liście liderów CyberGym w momencie publikacji, chociaż benchmark korzysta z publicznego zestawu testowego i zdefiniowanej metryki sukcesu.
MAI-Cyber-1-Flash nie działa samodzielnie. Microsoft twierdzi, że obsługuje do 90% zadań, podczas gdy MDASH kieruje najtrudniejsze 10% do GPT-5.4. To ma znaczenie, ponieważ tokeny - fragmenty tekstu, które przetwarza AI - kosztują pieniądze za każdym razem, gdy model odczytuje kod lub produkuje odpowiedź.
To pierwszy raz, gdy model Microsoftu stworzony z myślą o efektywności jest w stanie przewyższyć gęsty model ostateczny stworzony z myślą o ogólnych możliwościach. "W połączeniu z MDASH, (MAI-Cyber-1-Flash) zapewnia światowej klasy wydajność za 50 procent kosztu wiodących modeli," napisał CEO Microsoftu Satya Nadella.
Model (w tym przypadku MAI-Cyber-1-Flash) to AI, które rozumuje nad kodem. Uchwyt (MDASH w tym przypadku) to maszyna wokół niego: agenci, narzędzia, kontrole i przepływ pracy, które decydują, gdzie szukać, kwestionować podejrzane odkrycia, usuwać duplikaty i udowadniać, że błąd można wywołać.
MDASH wykorzystuje ponad 100 wyspecjalizowanych agentów przypisanych do audytowania kodu, debatowania, czy odkrycie jest autentyczne, oraz budowania dowodu koncepcji - działającej demonstracji, że wada istnieje.
Microsoft stwierdził, że okazjonalne skanowania i opóźnione poprawki stają się przestarzałe, ponieważ AI sprawia, że odkrywanie błędów jest tańsze. Firma argumentuje, że dziesięciolecia danych dotyczących bezpieczeństwa dają jej przewagę, dodając: "Nikt nie może wyprodukować tej historii."
Od momentu wydania Claude Mythos eksperci ds. cyberbezpieczeństwa starają się przewyższyć lub dorównać jego możliwościom. Naukowcy odtworzyli polowanie na luki w stylu Mythos za pomocą publicznych modeli za mniej niż 30 USD za skan. Dawid Moczadło, jeden z zaangażowanych badaczy, powiedział: "fosse przesuwa się z dostępu do modelu na walidację."
Rzadką częścią staje się system, który udowadnia odkrycia, nie przytłaczając programistów fałszywymi alarmami.
Decrypt również doniósł, że GPT-5.5 Cyber niedawno objął prowadzenie w publicznym CyberGym z wynikiem 85,6%, nieznacznie przewyższając Mythos. Wynik Microsoftu jest około 10 punktów powyżej GPT-5.5 Cyber i 7,5 punktów powyżej poprzedniego wyniku MDASH, ale ocenia cały system, a nie MAI-Cyber-1-Flash samodzielnie.
Microsoft wprowadza MDASH do prywatnego podglądu poprzez Microsoft Security Exposure Management w portalu Defender. Klienci mogą skanować repozytoria Git, zobaczyć odkrycia oceniane od mało prawdopodobnych do udowodnionych oraz używać Defender CLI do generowania proponowanych poprawek kodu do przeglądu przez programistów.
Podgląd obecnie ogranicza repozytoria do około 256 MB i pozwala na jedno równoczesne skanowanie na najemcę. Projekt Perception ma na celu rozszerzenie tego samego podejścia wieloagentowego poza skanowanie kodu na szersze monitorowanie zagrożeń i przepływy pracy związane z usuwaniem.
Cena --
Niniejsza treść ma charakter wyłącznie informacyjny i nie stanowi porady finansowej, inwestycyjnej, prawnej ani podatkowej. Wszelkie wydarzenia, nagrody, promocje online lub powiązane informacje, o których tu mowa, nie powinny być traktowane jako rekomendacja, zachęta ani zaproszenie do kupna, sprzedaży, wymiany lub innego rodzaju obrotu aktywami kryptograficznymi. Aktywa kryptograficzne charakteryzują się dużą zmiennością i mogą prowadzić do strat. Dostępność usług, produktów i powiązanych wydarzeń WEEX może się różnić w zależności od regionu. Użytkownik jest odpowiedzialny za upewnienie się, że jego udział jest zgodny z obowiązującymi lokalnymi przepisami i regulacjami.
Możesz również polubić

Gemini uzyskało wsparcie arbitrażu, nie ponosi odpowiedzialności za upadek programu pożyczkowego Earn

Platformy kryptowalutowe straciły 3,63 miliarda dolarów z powodu cyberataków

Ant Group wprowadza model finansowy Ling-3.0-flash-Fin, otwarcie kodu w przyszłym tygodniu

Virtuals wzmacnia politykę bezpieczeństwa portfeli agentów AI

Wartość rynkowa Alphabet spadła o prawie 700 miliardów dolarów, wątpliwości co do konkurencyjności AI

Google wprowadza model transkrypcyjny Gemini 3.5

Mastercard wspiera hackathon XRP Ledger w Nowym Jorku w październiku

Nowy model płatności za usługi Google Cloud Gemini Enterprise

Gemini łączy siły z Apex, aby rozszerzyć swoje rynki prognozowania kryptowalut dla amerykańskich brokerów

Ryzyko kredytowe Gemini AI: Deutsche Bank analizuje w 5 minut

Czemu OpenAI traci kierownictwo?

List do akcjonariuszy Andrew Kang: Inwestycje w roboty wkraczają w nowy etap, wyceny w private equity wciąż znacznie w tyle

Google uruchomił Gemini Enterprise for Legal dla kancelarii prawnych

Najlepsze modele sztucznej inteligencji do handlu; porównanie 10 najlepszych modeli

Biznesmen z Las Vegas grozi 280 lat więzienia za schemat Ponziego na 24 miliony dolarów w kryptowalutach

Gemini 3.7 Flash Review: Tani model Google'a już nie jest głupi

Roman Storm oskarża Google i OpenAI o wspieranie Korei Północnej

Poranny raport z Wall Street: CPI i PPI spadają, S&P osiąga nowe szczyty, SanDisk i Workday napędzają wzrosty w sektorze pamięci i oprogramowania, a komunikacja optyczna doświadcza realizacji zysków

Gemini raportuje stratę netto w wysokości 107,7 miliona dolarów, akcje spadają o ponad 7%

Doniesienia o przekazaniu władzy w DeepMind, oficjalne tytuły niejasne

Najlepsze platformy dla agentów AI 2026: tylko 130 z tysięcy jest prawdziwych

Czy modele open-source zabić zapotrzebowanie na moc obliczeniową? Morgan Stanley prognozuje trzy przyszłości AI

Sergej Brin ponownie zaangażowany w strategię AI Google'a

SemiAnalysis: Gemini 3 Pro może być szczytem konkurencyjności modeli Google, a usługi chmurowe największym beneficjentem

Rewolucja w kierownictwie AI Google: fizyczne rozdzielenie między głęboką wodą AGI a codziennymi modelami

Opóźnienie w premierze Google Gemini 3.5 Pro

Robinhood rozważa umowę z Crypto.com w miarę wzrostu konkurencji na rynku prognoz

Nieczynne moce obliczeniowe, tania energia, niedoceniane modele - DGrid chce przekształcić je w zyski

Rekordowy wynik na Mistrzostwach Świata: 5,7 miliarda $ zakładów na Kalshi i Polymarket




