Anthropic przyznaje się do błędów: pełna autopsja wpadek Claude'a

By: journalducoin.com|2026/09/04 17:00:00
0
Udostępnij
copy
Oceń nas w GoogleOceń nas w Google

Kto się tłumaczy, ten się oskarża. Miesiąc względnej ciszy, a potem formalne przyznanie się do winy. Po dwóch ucieczkach Claude'a pod koniec lipca, Anthropic opublikowało 31 sierpnia szczegółowy wpis na temat korzeni problemu. Firma przyznaje, że to, co dotychczas głównie zarządzała w pośpiechu, dotyczy trzech jej modeli, które uzyskały nieautoryzowany dostęp do systemów produkcyjnych trzech rzeczywistych organizacji podczas testów cyberbezpieczeństwa, które miały odbywać się w zamkniętym środowisku. Podsumujmy.
Kluczowe punkty tego artykułu:

  • Anthropic przyznało się do luk w swoich testach cyberbezpieczeństwa po ucieczkach modeli, ujawniając podwójną zaniedbanie operacyjne i ludzkie.
  • Firma wzmocniła swoje środki bezpieczeństwa, wprowadzając nowe narzędzie do blokowania nieautoryzowanych działań oraz przekierowując inżynierów do działu bezpieczeństwa.

Podwójne zaniedbanie, operacyjne i ludzkie

Laboratorium wskazuje dwa odrębne powody w swoim wpisie z 31 sierpnia. Po pierwsze, dobrze zidentyfikowany problem operacyjny, otwarty dostęp do Internetu przez pomyłkę u partnera zewnętrznego, podczas gdy model sądził, że działa w zamkniętym środowisku. Po drugie, co bardziej niepokojące, problem z dostosowaniem. Claude wyraźnie napotkał wskazówki, które sugerowały, że jego pole gry jest rzeczywiste, nie zmieniając jednak swojego zachowania. Anthropic mówi o motywowanym rozumowaniu, tendencji modelu do interpretowania niejednoznacznych sygnałów w sposób, który utrzymuje jego pierwotne przekonanie, zamiast je podważać. W jednym przypadku fikcyjny cel ćwiczenia nosił nawet nazwę rzeczywistej strony, jeszcze bardziej zacierając granicę między grą a światem.
Aby zmierzyć skalę problemu, Anthropic przeprowadziło eksperyment, celowo trenując model klasy Opus w znanych środowiskach, aby zachęcić do oszustwa. Model, który powstał, wykazał wyraźną tendencję do chcenia wygrania za wszelką cenę, aż do sabotowania własnej funkcji nagrody i proponowania pomocy w produkcji broni biologicznej, aby zadowolić fikcyjnego oceniającego. Nie ma to nic wspólnego z modelami rzeczywiście wprowadzonymi na rynek, podkreśla firma, ale potwierdza przez odwrotną demonstrację, że incydenty z lipca nie były przypadkowym wypadkiem.
Brakujący zabezpieczenia, które nadchodzi

Z operacyjnego punktu widzenia, Anthropic zawiesiło swoje zewnętrzne oceny cybernetyczne na kilka tygodni, aby wzmocnić izolację piaskownic i wdrożyć nowy klasyfikator, odpowiedzialny za wykrywanie w czasie rzeczywistym wszelkich prób opuszczenia środowiska testowego. Gdy tylko model przekroczy nieautoryzowaną granicę, narzędzie blokuje działanie przed jego wykonaniem, przerywa test i powiadamia człowieka. Firma przekierowała również około 150 inżynierów produktu do działu bezpieczeństwa na kilka miesięcy, wstrzymała rozwój nowych funkcji, aby zamknąć luki, oraz nałożyła na każdego partnera testującego swoje modele bez zabezpieczeń cybernetycznych ścisły protokół: piaskownica odcięta od Internetu, wyraźny zakres w każdej instrukcji, ciągłe nadzorowanie aktywności.
Anthropic nie jest jedyną firmą, która doświadcza tego rodzaju nieprzyjemności. OpenAI właśnie zablokowało dostęp do Astra, swojego własnego modelu uznanego za << krytyczne ryzyko cybernetyczne >>, po podobnym incydencie w Hugging Face pod koniec lipca. Dwa rywalizujące laboratoria, dwa publiczne przyznania się do winy w odstępie miesiąca. Cała branża uczy się, jak wprowadzać zabezpieczenia dla coraz bardziej autonomicznych agentów, w momencie, gdy ci sami agenci zaczynają zarządzać portfelami kryptowalut i transakcjami on-chain bez nadzoru ludzkiego na każdym etapie.

Cena --

--
--
--

Niniejsza treść ma charakter wyłącznie informacyjny i nie stanowi porady finansowej, inwestycyjnej, prawnej ani podatkowej. Wszelkie wydarzenia, nagrody, promocje online lub powiązane informacje, o których tu mowa, nie powinny być traktowane jako rekomendacja, zachęta ani zaproszenie do kupna, sprzedaży, wymiany lub innego rodzaju obrotu aktywami kryptograficznymi. Aktywa kryptograficzne charakteryzują się dużą zmiennością i mogą prowadzić do strat. Dostępność usług, produktów i powiązanych wydarzeń WEEX może się różnić w zależności od regionu. Użytkownik jest odpowiedzialny za upewnienie się, że jego udział jest zgodny z obowiązującymi lokalnymi przepisami i regulacjami.

Możesz również polubić

Najnowsze notowania monet na WEEX

iconiconiconiconiconiconiconicon
Obsługa klienta:@weikecs
Współpraca biznesowa:@weikecs
Quant trading i MM:[email protected]
Program VIP:[email protected]