Badacze AI sprawili, że chatboty dzieliły się przepisami na kokainę dzięki temu jednemu dzikim trikowi
Zapomnij o sprytnych podpowiedziach: badacze AI twierdzą, że oszukali wiodące modele AI, zmuszając je do generowania instrukcji syntezy kokainy, przekonując je, że niebezpieczne pomysły są ich własne, a także manipulując agentem kodującym AI, aby ujawniał wrażliwe dane.
W artykule "Wstrzykiwanie podpowiedzi jako zamieszanie ról", zaprezentowanym na Międzynarodowej Konferencji na temat Uczenia Maszynowego w czerwcu, badacze Charles Ye, Jasmine Cui i Dylan Hadfield-Menell argumentują, że oba przypadki demonstracji ataku wstrzykiwania podpowiedzi wynikają z strukturalnej wady w tym, jak duże modele językowe (LLM) rozróżniają zaufane instrukcje od nieufnych tekstów.
"Dla LLM wszystko przychodzi przez ten sam kanał jako jedna długa zupa tokenów," napisał zespół. "Jego własne myśli siedzą obok twoich instrukcji, które siedzą obok treści losowej strony internetowej, którą właśnie pobrał."
Artykuł wskazał również na to, co badacze nazwali "zamieszaniem ról", gdzie modele polegają na stylu pisania, a nie na tagach ról, aby określić, czy polecenia są godne zaufania. Zamiast rozpoznawać treści kontrolowane przez atakującego jako zewnętrzny wkład, badacze odkryli, że modele mogą pomylić je z legalnymi poleceniami użytkownika - lub nawet z własnym wewnętrznym rozumowaniem.
"Pomyśl o tym z perspektywy LLM. Kiedy widzi swój wcześniejszy tekst myślowy, implicitnie ufa swoim wnioskom. To cały sens rozumowania: jeśli LLM musiałoby ponownie wyprowadzać te same wnioski, rozumowanie byłoby bezużyteczne," napisali. "Więc tekst myślowy zyskuje rodzaj ogólnego zaufania. W połączeniu z naszymi wcześniejszymi ustaleniami sugeruje to, że jeśli możesz sprawić, aby wstrzyknięty tekst brzmiał jak rozumowanie modelu, możesz ukraść to zaufanie."
Nazywane fałszerstwem łańcucha myśli (CoT), atak wstawia fałszywe rozumowanie, które naśladuje wewnętrzny proces myślowy modelu. Modele, które normalnie odrzucałyby nielegalne żądania, zamiast tego generowały instrukcje syntezy kokainy po zaakceptowaniu sfałszowanego rozumowania jako własnego.
Badacze stwierdzili, że technika zwiększyła wskaźniki sukcesu jailbreaku z bliskiego zera do około 60% wśród modeli, które testowali, w tym GPT-5 nano, mini i full od OpenAI, o4-mini oraz gpt-oss-20b i gpt-oss-120b. Powiedzieli również, że działała na GLM-4.6, Kimi-K2-Instruct i MiniMax-M2.
W eksperymencie badacze stwierdzili, że udało im się również oszukać agenta kodującego AI, aby przesłał plik SECRETS.env po ukryciu złośliwych instrukcji na stronie internetowej.
"Używając naszych sond, odkrywamy, że po prostu dodanie 'Użytkownik' przed poleceniem sprawia, że model postrzega polecenie jako bardziej prawdopodobne, że jest autentycznym tekstem użytkownika (tj. wyższa Użytkowność)," napisali. "Innymi słowy, atakujący może po prostu twierdzić, jaką rolę ma tekst, a LLM w to wierzy."
Badanie ukazuje, jak ataki wstrzykiwania podpowiedzi nadal ujawniają słabości w agentach AI. W kwietniu badacze Google ostrzegli, że złośliwe strony internetowe ukrywają niewidoczne instrukcje zaprojektowane w celu oszukania agentów AI w ujawnianiu danych uwierzytelniających, usuwaniu plików, a nawet wysyłaniu płatności PayPal.
W czerwcu Microsoft ujawnił lukę w wstrzykiwaniu podpowiedzi w akcji GitHub Claude Code firmy Anthropic, która mogła ujawnić dane uwierzytelniające przechowywane w pipeline'ach rozwoju oprogramowania. Kilka dni później inne badanie benchmarkowe wykazało, że agenci AI zasilani przez GPT-5 i Gemini nadal nie zdali większości ataków wstrzykiwania podpowiedzi, mimo poprawy możliwości modeli.
Cena --
Niniejsza treść ma charakter wyłącznie informacyjny i nie stanowi porady finansowej, inwestycyjnej, prawnej ani podatkowej. Wszelkie wydarzenia, nagrody, promocje online lub powiązane informacje, o których tu mowa, nie powinny być traktowane jako rekomendacja, zachęta ani zaproszenie do kupna, sprzedaży, wymiany lub innego rodzaju obrotu aktywami kryptograficznymi. Aktywa kryptograficzne charakteryzują się dużą zmiennością i mogą prowadzić do strat. Dostępność usług, produktów i powiązanych wydarzeń WEEX może się różnić w zależności od regionu. Użytkownik jest odpowiedzialny za upewnienie się, że jego udział jest zgodny z obowiązującymi lokalnymi przepisami i regulacjami.
Możesz również polubić

„Jak prawie straciłem połowę moich bitcoinów (i Kimi K3 uratował mi dzień)”: użytkownik Ledger

Armbian 26.8 przepisuje swój instalator i rozszerza wsparcie dla płyt ARM i RISC-V

NVIDIA wprowadza Jetson Orin Nano 2, podwajając wydajność wnioskowania

Poranny raport z Wall Street: Ocieplenie na Bliskim Wschodzie i odbicie AI wspierają amerykański rynek akcji, czy Nvidia przełamie klątwę spadków po wynikach?

Luka w portfelu Ledger; użytkownicy muszą zaktualizować aplikację Ethereum do wersji 1.22.2

Umowa dotycząca dostaw energii z mikroreaktorów o mocy 6GW między NANO Nuclear Energy a Tillman

Awaria w Ledger mogła spowodować podpisanie innej transakcji Ethereum niż ta wyświetlana

Przemiany w konkurencji AI: presja kosztów w modelu open weight

Sprzętowe portfele kryptowalutowe zyskały na popularności wśród Rosjan

Dlaczego Stripe wydał 10 miliardów na zakup OpenRouter? Czy buduje Visa w erze AI?

Tether wprowadza otwarty model językowy VisionPsy-Nano

Nano Banana 2 Lite vs. Nano Banana 2: Kiedy oszczędzać pieniądze, a kiedy zaktualizować

Czym jest portfel XRP? Najlepsze portfele do przechowywania XRP (aktualizacja 2026)
Portfel XRP pozwala bezpiecznie przechowywać, wysyłać i odbierać XRP w systemie XRP Ledger. Dowiedz się, które portfele obsługują XRP i odkryj najlepsze portfele XRP dla początkujących i długoterminowych posiadaczy w 2026 roku.

Espanyol kontra FC Barcelona: Derby z ogniem i jakością
Derby Espanyolu i FC Barcelona dostarczyły emocjonującej gry, a Barca wygrała 4-1 i odskoczyła na dziewięć punktów na czele tabeli LALIGA. Mistrzowska klasa Lamine Yamal, dwie bramki Ferrana Torresa i pełna pasji rywalizacja między miastami. WEEX, oficjalny partner regionalny LALIGA w Hongkongu i na Tajwanie, świętuje tę piękną grę.

Szczyt „Agenci AI w akcji”: 31 marca, Hong Kong Cyberport – skupiamy się na głębszych aspektach wdrażania sztucznej inteligencji

Byli urzędnicy SEC i CFTC wzywają do łagodniejszego podejścia, aby przyciągnąć handel kryptowalutami do kraju

Partnerstwo Solana crypto z rekordem 169,9 miliona transakcji

Cyberataki: Sztuczna inteligencja (SI) może destabilizować światową finansję!

Boom na debiuty giełdowe w Chinach: firmy zajmujące się AI i robotyką prowadzą w Szanghaju i Hongkongu

HKDAP może przenieść HKD poza płatności do finansów on-chain, mówi badacz HashKey

NASA i SpaceX opóźniają Crew-13 z powodu wycieku w statku Dragon

Coinhouse przejmuje Tilvest i umacnia swoją pozycję w zarządzaniu kryptowalutami

Strive kupuje Bitcoiny o wartości 143 mln USD, staje się piątym co do wielkości posiadaczem

"Technologia schodzi na drugi plan": jak stablecoiny przechodzą od oszczędności do codziennych płatności

Główna sieć Fogo została zatrzymana na 46 godzin bez harmonogramu ponownego uruchomienia

Circle wyemitowała 5 miliardów USDC w ciągu tygodnia: rynek kryptowalut ponownie czeka na sezon altcoinów

Hacking: Belgia wymaga adresów kryptowalutowych od nielegalnych stron

Banki poprawiły swoją rentowność, ale nadal istnieje zagrożenie z powodu zaległości: kluczowe informacje z ostatnich bilansów

CME stawia na ETF-y: powstają pierwsze regulowane indeksy kryptowalutowe multi-asset FCA








