Claude Mythos 5 firmy Anthropic 'Celował w prawdziwych ludzi' w testach cybernetycznych w Wielkiej Brytanii: AISI
Instytut Bezpieczeństwa AI w Wielkiej Brytanii ujawnił, że agenci AI podjęli "utrzymane, niesankcjonowane działania" w internecie podczas oceny cybernetycznej pod koniec lipca, w tym przypadki, które "celowały w prawdziwych ludzi i organizacje".
W ramach 122 uruchomień dwóch zakresów cybernetycznych na siedmiu modelach, AISI zarejestrował 19 działań, które wykraczały poza środowisko testowe, w 10 uruchomieniach. Siedemnaście pochodziło z Claude Mythos 5 firmy Anthropic, a dwa z GPT-5.6 Sol firmy OpenAI. Dostęp do internetu został celowo włączony, a klasyfikatory cybernetyczne dostawców wyłączone, co nie dotyczy publicznych wdrożeń.
W najpoważniejszym uruchomieniu agent postanowił rozwiązać swoje wyzwanie za pomocą ataku na łańcuch dostaw, przypadkowo wybierając swój cel: przeszukał GitHub w poszukiwaniu słów kluczowych z ćwiczenia, trafił na dwóch niezwiązanych deweloperów i błędnie uznał, że są w zakresie. Zarejestrował konta przez Tor, aby przejść przez kontrole rejestracji, otworzył prośbę o włączenie zawierającą ukryty złośliwy program w postaci prawdziwej poprawki błędów i opublikował z drugiego konta, które kontrolował, aby wywołać wsparcie. Zasadził również wstrzyknięcia poleceń skierowane do asystentów kodowania AI i wysłał złośliwe oprogramowanie do konserwatorów.
Trzeci deweloper zauważył wstrzyknięty kod, uruchomił go w izolowanym kontenerze, aby potwierdzić, że jest złośliwy, i ostrzegł konserwatora, który zamknął prośbę o włączenie, powołując się na złośliwe oprogramowanie.
Agent wielokrotnie rozważał, czy jego otoczenie jest symulowane, w pewnym momencie wykluczając atak na prawdziwe PyPI, ponieważ "spowodowanie szkód w rzeczywistości - to całkowicie wykluczone". W innym miejscu doszedł do wniosku, że "wydaje się bardziej prawdopodobne, że naprawdę jesteśmy w 2026 roku, a GitHub jest naprawdę prawdziwy", i kontynuował mimo to.
Po tym, jak został złapany, wymusił usunięcie ładunku, edytował wcześniejsze posty i przedstawił kod jako przypadkowe zatwierdzenie. Jego rozumowanie opisuje synchronizację komentarza sockpuppet, aby brzmiał "jak niezależna opinia, a nie skoordynowana".
AISI widzi tylko podsumowane rozumowanie z interfejsów API modeli. W jednym przypadku model podsumowujący wydaje się odmówić wykonania zadania, odpowiadając, że nie zaangażuje się w treści dotyczące oszukiwania konserwatorów i unikania wykrycia.
Jeden agent opublikował token dostępu do GitHub w publicznym gicie. Agenci w innych uruchomieniach go znaleźli, przejęli konto i użyli wspólnego repozytorium do koordynacji, jeden zostawiając instrukcje, aby inni nie wyczerpali wspólnego limitu API.
Monitoring komercyjny oznaczył ruch Tor w poranku 28 lipca. AISI ogłosił incydent, zakończył uruchomienia i poddał maszyny kwarantannie w ciągu około 90 minut, a następnie odciął wewnętrzny dostęp do Mythos 5, Mythos Preview, Opus 5 i GPT-5.6 Sol. Żaden agent nie próbował uciec ze swojej piaskownicy.
To wiadomość w serii incydentów, w których agenci AI przekroczyli swoje parametry w testach. 21 lipca OpenAI ogłosiło, że GPT-5.6 Sol i model, który nie został wydany, znalazły zero-day w wewnętrznym proxy pakietów, uciekły z piaskownicy bez dostępu do internetu i dotarły do bazy danych produkcyjnej Hugging Face, aby ukraść odpowiedzi benchmarkowe. To samo uruchomienie dotarło do czterech innych firm, OpenAI ujawniło tydzień później.
Anthropic kontynuował 30 lipca, ujawniając trzy incydenty znalezione w przeglądzie ponad 141 000 uruchomień oceny. Opus 4.7 pobrał kilka setek wierszy z prawdziwej bazy danych produkcyjnej, a Mythos 5 przesłał złośliwy pakiet Pythona do prawdziwego PyPI, gdzie został zainstalowany na 15 systemach. W ocenie AISI ten sam model wykluczył atak na PyPI jako szkodę w rzeczywistości.
Cena --
Niniejsza treść ma charakter wyłącznie informacyjny i nie stanowi porady finansowej, inwestycyjnej, prawnej ani podatkowej. Wszelkie wydarzenia, nagrody, promocje online lub powiązane informacje, o których tu mowa, nie powinny być traktowane jako rekomendacja, zachęta ani zaproszenie do kupna, sprzedaży, wymiany lub innego rodzaju obrotu aktywami kryptograficznymi. Aktywa kryptograficzne charakteryzują się dużą zmiennością i mogą prowadzić do strat. Dostępność usług, produktów i powiązanych wydarzeń WEEX może się różnić w zależności od regionu. Użytkownik jest odpowiedzialny za upewnienie się, że jego udział jest zgodny z obowiązującymi lokalnymi przepisami i regulacjami.
Możesz również polubić

IMF wzywa do międzynarodowej współpracy w regulacji stablecoinów, alarmując o utrzymaniu suwerenności finansowej krajów rozwijających się

Fundusz wzrostu a16z zwiększa swój rozmiar do 8,5 miliarda dolarów, dodając 1,1 miliarda dolarów do funduszu sprzętu AI

Grok umożliwia zakup i wnioskowanie o pożyczki w kryptowalutach

SEC i CFTC opóźniają wymagania dotyczące ujawniania informacji przez fundusze hedgingowe do 1 lipca

a16z ujawnia: Dlaczego Argentyńczycy "kupując kryptowaluty, kupują dolary"? Po kryzysie, stablecoiny stały się nawykiem narodowym

Preferencyjne akcje z maksymalną zniżką 63%, pojawiają się pytania o odpowiedzialność zarządu

Oferują rzekome 5,5 miliona rekordów MyVete za 4000 USD

Strategia sprzeciwia się propozycji MSCI dotyczącej wykluczenia aktywów cyfrowych

Polygon naprawia lukę w sieci poprzez hard fork

Iran twierdzi, że zestrzelił amerykańskiego drona MQ-9 Reaper w pobliżu cieśniny Ormuz

Bank Bernstein prognozuje, że Bitcoin osiągnie 300000 dolarów w 2029 roku

Goldman Sachs prognozuje, że strategia carry pozostaje skuteczna mimo interwencji w rynku jena

Amerykańska SEC i CFTC przyspieszają tworzenie przepisów dotyczących kryptowalut w czasie przerwy w Kongresie

Singapur zainwestuje 173 miliony dolarów w innowacje fintech w ciągu najbliższych trzech lat

Departament Wojny USA uruchamia Grok for Government na GenAI.mil

Sony twierdzi, że posiadanie gier cyfrowych jest mylące w sądzie

Dune uruchamia zestaw danych dotyczących aktywów z rzeczywistego świata

Changxin rozpoczął produkcję HBM3E w małych seriach, planuje zwiększenie produkcji w 2027 roku

Akcje GameStop wzrosły o 4% po płatności w wysokości 358 milionów dolarów

Banki poprawiły swoją rentowność, ale nadal istnieje zagrożenie z powodu zaległości: kluczowe informacje z ostatnich bilansów

C1 Fund zwiększył pozycję w Polymarket w drugim kwartale, odkupił akcje o wartości 824 tys. dolarów

Premiera inteligentnego modelu przemysłowego 3.0 Pro

Dragoneer planuje utworzenie funduszu przetrwania o wartości 2 miliardów dolarów z aktywami takimi jak OpenAI, zbierając faktycznie 1 miliard dolarów

Lido DAO przyznaje 60000 dolarów na wsparcie standardów operacyjnych weryfikatorów ValOS

tZERO i ICE nawiązują współpracę, ICE inwestuje w rundę finansowania tZERO i uzyskuje licencję na patenty blockchain

Urzędnicy z Peru będą się szkolić w zakresie kryptowalut i cyberbezpieczeństwa

Renaiss osiągnęło przychody przekraczające 30 milionów dolarów, wprowadza standard weryfikacji sprawiedliwości losowania blind boxów

Focus: inflacja spada, ale spadek PKB bardziej niepokoi

Strategia kupuje 4603 BTC za 370 milionów USD




